Индивидуальная траектория 03 · 12 конспектов
Обучение с подкреплением
От многоруких бандитов до PPO и обучения по видеозаписям. Конспекты читаются по порядку: каждый опирается на определения и формулы предыдущих; предполагается пройденной траектория «Нейросети». Табличные методы — на numpy, глубокое обучение с подкреплением — на PyTorch (с сопоставлением с Keras). В каждом конспекте — интерактивный тренажёр и контрольные вопросы.
- 01 Задача обучения с подкреплением Агент и среда, политика, награда и возврат, галерея классических задач, первый запуск Gymnasium.
- 02 Многорукие бандиты Ценность действия, сожаление и его разложение, ε-жадные стратегии, инкрементальные обновления, эксперимент Саттона–Барто.
- 03 Марковские процессы принятия решений Марковское свойство, MDP, функции ценности, уравнение Беллмана с выводом, оператор Беллмана и сжатие.
- 04 Монте-Карло и TD-обучение Улучшение политики и GPI, first/every-visit MC, важностная выборка, TD-ошибка и бутстрап, n-шаговый спектр.
- 05 Табличные SARSA и Q-обучение Уравнение оптимальности, Q-learning и SARSA с кодом, итерационный поиск политики, FrozenLake, переоценка максимума.
- 06 Среды Gymnasium Контракт Env и пространства, своя среда GridWorld, обёртки, завершение против усечения, маскирование действий на Taxi.
- 07 Глубокое Q-обучение (DQN) MountainCar: дискретизация и её пределы, deadly triad, память переходов и целевая сеть, полный PyTorch-код, Atari.
- 08 Улучшения DQN: Double и Dueling Переоценка максимума вживую, двойная оценка, Q = V + A, дуэльная сеть; практика — гоночная машинка CarRacing по пикселям.
- 09 Policy Gradient и REINFORCE Сеть политики, вывод градиента с доказательствами, reward-to-go и baseline, REINFORCE решает CartPole; где метод ломается.
- 10 Actor-Critic и непрерывные действия Преимущество, TD-ошибка как его оценка, алгоритм актёр–критик, гауссова политика, векторные среды, DDPG.
- 11 Trust Region и PPO Importance ratio и суррогат, доверительный регион, клип-теорема с тренажёром, GAE, PPO на CartPole и Pendulum, мостик к RLHF.
- 12 Обучение по видео: RLV и APV Чего нет в видео; обратная модель динамики и подмена наград (RLV), предобучение модели мира (APV); мини-RLV на машинке.